假如有一万张卡,RL训练该怎么扩大规模?十万张呢? 假如有一万张卡,RL训练该怎么扩大规模?十万张呢? 关键词: AI新闻,模型训练,Batch Size,人工智能 当预训练将大模型带到新的能力起点,强化学习则通过持续的探索与反馈,不断激发模型在新环境、新任务中的推理与行动能力,决定它们还能走多远。 来自主题: AI技术研报 7519 点击 2026-09-22 14:43